1
典範轉移:從任務特定模型到大型語言模型
PolyU COMP5511Lecture 10
00:00

自然語言處理的演進:從碎片化人工智慧到基礎模型

定義

  • 碎片化人工智慧:一個以離散、專門的神經網路架構為特徵的時代,這些架構專為序列標註或分類等個別任務所設計。
  • 基礎模型:一種統一的、單體式 Transformer 架構,將所有語言問題都視為生成式的文字到文字序列 $x \rightarrow y$。

核心概念

  • 架構整合: 在歷史上,自然語言處理需要量身打造的管線(NER 用 Bi-LSTM,情感分析用 CNN)。大型語言模型將這些孤島式架構整合為單一主幹,同一組權重適用於所有任務。
  • 統一介面: 大型語言模型以自然語言介面取代專門的「輸出層」(例如三類 Softmax)。輸入和輸出始終是字串,讓模型能理解 意圖 而非 格式
  • 知識遷移: 傳統模型對每個任務都是「白紙狀態」。大型語言模型則優先重視 泛化優先,其中特定任務只是既有、穩健之語言內部表徵的應用而已。

歷史脈絡

  • 2018 年之前: 任務隔離要求以不同的損失函數 $\mathcal{L}_{task}$ 訓練各自的模型。
  • 現代: 「文字到文字」典範讓單一模型(例如 Llama-3)能夠透過零樣本或少樣本提示來切換任務。
傳統人工智慧$f_{NER}(x) \rightarrow y_{labels}$$f_{Sent}(x) \rightarrow y_{class}$$f_{Trans}(x) \rightarrow y_{seq}$基礎模型時代提示詞 + $x$大型語言模型$f(p, x) \rightarrow y_{str}$字串 $y$
Python 實作比較